-
BagelVLA 论文精读:用交错语言计划与视觉预见解决长时域操作精读 BagelVLA:在统一 MoT 模型中交错生成子任务文本、未来关键帧和动作,并用 Residual Flow Guidance 降低视觉预见延迟。
13 min read -
VISTA:Scaling World Model 论文精读精读 VISTA:用可生成的视觉子目标把 Embodied World Model 变成高层规划器,再由 GoalVLA 执行低层动作,提升少样本机器人操作的 OOD 泛化。
21 min read -
BAGEL 论文精读:交错多模态预训练中的涌现能力精读 BAGEL:7B active / 14B total 的统一理解与生成模型,用 MoT、Rectified Flow 和视频/网页交错数据训练,并分析 IntelligentBench 与世界建模涌现。
27 min read